Дневная сводка: Сбер AI -- 14.07.2026
Публикации дня посвящены выпуску двух речевых моделей в Open Source, принятых на главную мировую конференцию по речевым технологиям Interspeech 2026.
Ключевые события и темы
Новые модели для работы со звуком: GigaChat Audio и GigaAM Multilingual
Сбер AI выложил в Open Source две модели. GigaChat Audio -- audio-native LLM, способная обрабатывать до 2 часов аудио с удержанием контекста: поиск фрагментов в длинных записях, создание саммари с таймкодами, распознавание эмоций с точностью более 90%. На бенчмарке RuBQ-Audio модель показывает 60,0 против 43,7 у Qwen3-Omni.
GigaAM Multilingual расширяет модель распознавания речи на казахский, киргизский, узбекский и английский языки. Компактная версия на 240M параметров превосходит Whisper Large v3 и Omnilingual 1B. Благодаря предобучению на 2 млн часов речи на более чем 70 языках модель достигает WER около 4% против 11%+ у Whisper.
Обе модели приняты на Interspeech 2026.
Ссылки:
Итог
14 июля Сбер AI анонсировал значимый вклад в область речевых технологий: две Open Source модели, превосходящие конкурентов на ключевых бенчмарках. Особенно важна поддержка языков СНГ в GigaAM Multilingual, заполняющая нишу, которую глобальные модели вроде Whisper обслуживают значительно хуже.